A、B 兩群的 CFA(驗證性因素分析)都能接受,B 群的 BE04 平均又較高,就可以說 B 群行為投入較高嗎?ENGAGE-v1 刻意在 BE04 的生成設定中加入群體位移,正好讓我們檢查這個跳躍。Day 17 處理各模型與資料是否相容;今天要多問一步:同一題在兩群中,是否以可比較的方式反映同一構念?
測量恆等性要為特定比較設定哪些量測參數應相等,例如因素負荷量、截距或類別切點。它沒有要求兩群學生完全相同。先說要比較因素關係、潛在平均或觀察分數,再倒推所需限制,才知道每一層模型多檢查了什麼。
對連續 indicators(指標題目)的常見教學順序是:
| 層級 | 跨群固定 | 主要支援的比較 |
|---|---|---|
| configural | 相同 factor pattern | 相同基本測量架構的起點 |
| metric/weak | 再固定 loadings | factor 關係的比較 |
| scalar/strong | 再固定 intercepts | latent mean 比較的必要基礎之一 |
| strict | 再固定 residual variances | 更強的 observed-score 比較條件 |
ENGAGE-v1 是 ordinal 題目(有序類別),實作會涉及 thresholds(切點)與尺度設定,不能把連續指標的 intercept 表原封不動套上。表格的用途是理解「多加一組相等限制,換取哪種比較」;實際參數化要依 estimator(估計方法)與識別方法閱讀官方文件。
| 層 | 群體模型責任 |
|---|---|
| 資料機制 | A、B 群體對同一 12 題產生 ordinal responses,BE04 有設計的 group shift |
| 目標 | 特定層級的 measurement parameter comparability 與可允許的群體比較 |
| 假設 | 各群模型適切、共同構念尺度可連結、抽樣與 group 定義有意義 |
| 可觀察量 | 各群 item statistics、model fit、parameter estimates 與 residuals |
| 決策規則 | 逐層加限制,比較 fit change、參數差異、局部 misfit 與理論 |
| 保證/限制 | 在工作模型下評估可比性;不能證明群體公平、完全相同或差異因果 |
請 Claude 起草多群組語法時,若附帶一張固定門檻表,將每層簡化成「ΔCFI(比較配適指標)小於某數字就過關」,要回來源核對適用條件。Chen(2007)研究配適度指標對不恆等的敏感度,涉及模型、樣本與違反型態;文獻建議不能脫離情境變成通用判定規則。
更有用的診斷表應並列整體配適變化、局部參數線索、標準化參數差異、題目內容解釋,以及放鬆限制後對目標比較的影響。Claude 可以整理欄位與候選解釋,教師則要判斷部分恆等性是否有實質理由;欄位填滿不表示比較已被支持。
生成器讓 B 群 BE04 在相同潛在(latent)作答反應(response)下略高。configural 模型(model)仍可能呈現相同三因素 pattern;因素負荷量(loading)也大致相近;當 thresholds/intercepts 被固定時,BE04 產生局部 misfit。這正是資料設計要保留的教學事件。
如果忽略它,B 群較高的 BE04 觀察到的作答反應(observed response)可能被誤讀成較高 behavioral engagement。若釋放 BE04 對應參數並有題意或作答機制理由,可以探索 partial invariance(部分恆等、測量恆等性);但潛在平均數(latent mean) identification 與其餘 invariant anchors 必須足夠,且結果要明示依賴哪些題目。
我不在合成例上宣稱 partial invariance 已為真實研究所接受。worked example(完整例題)只示範:局部 parameter difference 會如何污染群體比較,以及修正後的結論範圍要縮小。
觀察平均不同不等於題目偏誤;若構念真的不同,平均差是 target 的一部分。反過來,平均相同也不證明測量恆等。measurement invariance 問的是相同潛在 standing 下,measurement relationship 是否可比。
另一個 failure case(失敗案例)是兩群各自 fit 好就比較。separate-group fit 沒有直接測試 equality constraints;要把群體放進共同模型,明確固定與比較。即使 scalar 模型能接受,群體分類的科學意義、樣本代表性與用途後果仍需另外處理。
接受與否要回到指標本身的意義:
| 指標 | 它摘要什麼 | 它不能證明什麼 |
|---|---|---|
| CFI/TLI | 相對 baseline model 的改善 | 構念可區分 |
| RMSEA | 近似誤差與自由度 | 模型正確 |
| SRMR | 標準化殘差的平均大小 | 題目測到對的東西 |
若只依 MI 一條條釋放直到過關,和 Day 17 的 fit chasing 相同。每次釋放要有三項紀錄:哪個參數、題目內容或作答歷程(response process)的理由、對欲比較 target 的影響。若釋放太多或 anchors 不穩,最負責的結論可能是不做潛在平均數 comparison。
此外,group 不只性別或地區,也可能是時間、語言、施測模式。longitudinal invariance 涉及相同人的依賴,翻譯版本涉及語意與文化,線上/紙本涉及 mode effects。方法名稱相同,資料機制不同。
讀者可用 BE04 做一次報告練習:先寫要比較哪個平均,再指出 BE04 的哪個參數可能破壞比較,最後說釋放限制後還靠哪些題目連結兩群。若第三句說不清楚,就先不要報潛在平均差。這比只記下一個「通過」狀態更能暴露識別與用途的缺口。
比較潛在平均數前,必須把群體因素(factor)放到共同尺度。常見參數化固定 reference group 的因素 mean/變異數(variance),再透過 invariant measurement parameters 連結其他群體。若 anchors 本身 noninvariant,平均差會依選哪幾題當尺而改變。這是為何「至少幾題 invariant 就夠」不能脫離模型與 target 回答。
Ordinal 題目還增加 threshold 與 scale-factor 的識別關係。不同軟體或參數化可能使用不同順序與名稱;教師應讀實際 estimator 文件,而不是把 continuous scalar invariance 的文字貼到輸出。文章保留連續表作概念梯子,執行卡則明列 ordered 題目、threshold constraints 與 reference scaling。
我用一個決策 probe(檢查題)收尾:若 BE04 noninvariant,釋放後 A/B 潛在平均數方向穩定,但大小改變,報告必須同時呈現 full 與 partial 模型、釋放理由與敏感度;若方向也翻轉,教材用途不應選擇較合意的版本,而應停止群體結論並回題目與作答歷程查核。
measurement invariance 也不是公平性的充分條件。參數相等仍可能有不公平的內容涵蓋、使用後果或群體分類;noninvariance 則需要理解來源,不能直接把群體或題目貼上偏誤標籤。它是公平性論證的一項證據,不是同義詞。
原問題的答案是:群體比較前,要檢查足以支援該比較的 measurement invariance;「同一把尺」是對參數限制與 target 的簡稱,不是群體完全相同。基礎閱讀是 lavaan multiple-groups tutorial(R 的結構方程式套件)。發展閱讀是 Meredith(1993)與 Chen(2007)。前沿閱讀可進 partial invariance 與 alignment(對齊法)。DIF(差異試題功能)與 fairness(公平性)也在這一層。
本篇留下恆等性階梯、BE04 局部差異的條件示範與部分恆等性的決策規則;沒有宣稱合成群體的比較已通過實證驗收。下一篇換到題目層級:IRT(試題反應理論)直接連結投入位置與反應機率,群體可比性的問題仍會跟著這把尺一起走。